Red-Teaming Medical AI: Systematic Adversarial Evaluation of LLM Safety Guardrails in Clinical Contexts
Cette étude présente un cadre systématique d'évaluation par test d'intrusion (red-teaming) des modèles de langage en contexte médical, révélant que bien que les garde-fous standards soient généralement efficaces, ils restent vulnérables à l'usurpation d'autorité, en particulier lorsque les demandes sont formulées dans un cadre éducatif.